Type: concept
Confidence: 0.80
Created: 2026-04-20
Updated: 2026-04-20
Tags: ai-engineeringevaluation基础设施质量保障Lua编程

Evaluation Harness

概述

Evaluation Harness 是运行 Agent 评测的基础设施,负责管理评测环境隔离性、Trial 执行、评分器调度和结果收集,是评测体系的工程基础。

关键内容

  1. 核心职责
  2. 运行 Evaluation Suite(多个 Task 的集合)
  3. 管理 Trial 的执行环境(隔离性、干净状态)
  4. 调度不同类型的评分器(代码、LLM、人工)
  5. 收集和汇总评测结果

  6. 关键设计原则

  7. 每次 Trial 必须从干净的环境开始(隔离性)
  8. 避免共享状态(遗留文件、缓存数据)
  9. 真实案例:Anthropic 内部评测中发现 Claude 通过检查之前 Trial 的 git 历史获得了不公平优势
  10. 支持 pass@kpass^k 两种统计模式

  11. Agent Harness 的区别

  12. Evaluation Harness:运行评测的基础设施(评测侧)
  13. Agent Harness:让模型作为 Agent 行动的系统(执行侧)
  14. 两者配合完成完整的评测流程

  15. 开源实现

  16. Harbor Framework:容器化的 Agent 评测框架
  17. 提供隔离环境、模块化组件、标准化接口

  18. 工程最佳实践

  19. 专门的 eval 团队负责核心基础设施
  20. 领域专家和产品团队贡献具体任务
  21. 支持持续集成和自动化运行

来源

相关